01 - 威胁模型:先搞清楚哪里会被打
不需要安全背景。你只要做过一个会调用工具的 Agent 就够了。
本篇回答:我的 Agent 到底有哪些地方会被打?怎么快速判断一个功能危不危险?
会用到的词:
- 提示注入(prompt injection):把指令伪装成数据喂给模型,让它执行本不该执行的操作
- 越权(privilege escalation):拿到了本不该有的权限
- 外传(exfiltration):把数据传出去
一、Lethal Trifecta 判据
安全框架很多,但要判断"我这个 Agent 危不危险",最快的方法是 Simon Willison 提出的 Lethal Trifecta(致命三要素)。
它只问三个是非题:
三个全占,就一定能被打穿。 缺任何一个,攻击链就断了。